想买一台 AI 盒子跑本地大模型,搜了一圈——有的标“50 TOPS”,有的标“6 TOPS”,价格从一千多到一万多。有人说“算力最重要”,有人说“内存才是关键”,还有人说“没 NPU 都是伪 AI”。到底看哪个参数?
这是目前很多 AI 开发者和企业 IT 采购最困惑的问题。跑本地大模型的 AI 盒子,选型逻辑和普通电脑完全不同——不能只看 CPU,不能只看品牌,甚至不能只看 TOPS 数字。
按 内存 → 算力 → 散热 → 接口 → 软件生态 → 架构 的优先级顺序,帮你拆解 AI 盒子的关键参数,并根据不同需求提供直接可用的配置推荐。
选 AI 盒子,第一眼看内存,而不是看算力。
大模型推理需要把模型文件从硬盘加载到内存中,如果内存不够,模型根本加载不了——算力再强也没用。内存决定“能不能跑”,算力决定“跑多快”。
| 模型规模 | 量化方式 | 文件大小 | 最低内存 | 推荐内存 | 说明 |
|---|---|---|---|---|---|
| 7B | Q4(4-bit) | ~4.5GB | 8GB | 16GB | 入门门槛 |
| 13B | Q4(4-bit) | ~7.5GB | 16GB | 32GB | 流畅运行需余量 |
| 30B | Q4(4-bit) | ~16GB | 32GB | 64GB | 高负载场景 |
| 70B | Q4(4-bit) | ~36GB | 64GB | 128GB | 旗舰配置 |
实测经验:跑 7B 模型,16GB 刚好够;跑 13B 模型,32GB 更从容(16GB 虽能加载,但多任务会卡顿)。如果预算允许,内存宁大勿小,这是影响能否使用的最关键参数。
大模型推理的本质,是不断地把模型参数从内存搬到计算单元做运算。如果内存带宽不够,计算单元只能空转等待数据,TOPS 再高也发挥不出来。
| 内存类型 | 典型带宽 | 7B 模型体验 |
|---|---|---|
| LPDDR4 | ~30GB/s | 带宽不足,推理卡顿 |
| LPDDR5 | ~60GB/s | 刚好跨过流畅线 |
| LPDDR5x | 100GB/s+ | 充裕,大模型也从容 |
选型建议:跑 7B 模型至少需要 40~50GB/s 的内存带宽,对应 LPDDR5 及以上。LPDDR4 设备在跑大模型时容易出现“算力在等数据”的问题,实际体验远不如纸面参数。购买时可以看规格表确认内存类型,或问销售具体的带宽数值。
内存“够用”之后,才轮到算力发挥作用。TOPS 是衡量 AI 推理算力的主要指标,但要注意区分 INT8 和 FP16。
| 算力等级 | 代表设备 | 7B 模型速度 | 13B 模型速度 | 适用场景 |
|---|---|---|---|---|
| <5 TOPS | 入门级 N100 | 1~3 token/s | 无法加载 | 纯尝鲜 |
| 5~10 TOPS | PB0601/PB0801(6 TOPS) | 8~12 token/s | 5~8 token/s | 轻量推理、边缘部署 |
| 10~20 TOPS | PB1202(核显方案) | 8~12 token/s | 5~8 token/s | 入门 7B 模型 |
| 20~50 TOPS | PB1301(50 TOPS NPU) | 15~25 token/s | 8~15 token/s | 7B~13B 流畅推理 |
| 50+ TOPS + 大内存 | PB1501(50 TOPS + 128GB) | 25~35 token/s | 15~22 token/s | 13B+ 大模型、70B 旗舰 |
TOPS 是理论峰值算力,实际速度受以下因素影响:
内存带宽:算力再高,内存带宽不足时计算单元只能空转等待数据
散热设计:持续推理时,散热不足会导致降频
模型优化:不同推理框架(Ollama vs 原生 RKNN)效率差异明显
建议:用实测 token/s 数据衡量,而不是只看 TOPS。
短跑(3~5 分钟)和长跑(持续 1 小时以上)完全不同。很多 AI 盒子跑短任务时很快,10 分钟后因为积热而降频,推理速度直接腰斩。
| 散热方式 | 持续性能 | 适合场景 |
|---|---|---|
| 被动散热(无风扇) | 适合低功耗(<15W) | 边缘部署、静音场景 |
| 主动散热(风扇) | 持续性能稳定 | 桌面 AI 推理、开发场景 |
选型建议:
运行 7B 模型持续推理超过 30 分钟,建议选择主动散热(有风扇)型号
查看评测中的“满载 30 分钟温度”数据,确认是否降频
硬件选好了,装不上软件等于白买。
| 平台 | 推理框架 | 上手难度 | 说明 |
|---|---|---|---|
| AMD(x86) | Ollama / LM Studio | 低 | 社区资源丰富,开源方案成熟 |
| Intel(x86) | Ollama / OpenVINO | 低 | 同样社区支持良好 |
| 瑞芯微(ARM) | RKNN / Ollama(ARM 版) | 中 | 需要确认 NPU 驱动和模型转换 |
| 英伟达(Jetson) | CUDA / TensorRT | 中 | 生态最成熟,但功耗和价格较高 |
选型建议:
个人开发者首选 x86 + Ollama 方案(如华一精品 PB 系列),上手最快
边缘批量部署,可考虑 ARM + NPU 方案(如 PB0601/PB0801),功耗更低
AI 盒子不一定只跑模型,可能还需要接摄像头、传感器、网络设备。
| 接口 | 用途 | 重要性 |
|---|---|---|
| 双网口 | 内外网隔离 / 摄像头接入 | ⭐⭐⭐⭐⭐(边缘部署强烈建议) |
| USB 3.0 | 外接设备 | ⭐⭐⭐⭐ |
| HDMI | 调试 / 本地显示 | ⭐⭐⭐ |
| 串口(RS232/485) | 接工业传感器/PLC | ⭐⭐⭐(工业场景必须) |
| Type-C / USB4 | 高速数据传输 | ⭐⭐⭐ |
| 你的需求 | 内存要求 | 推荐型号 | 核心特点 | 参考价格 |
|---|---|---|---|---|
| 7B 模型入门 + 日常办公 | 16GB(可升级) | PB1001 | 超高性价比,内存可升级 | ¥1,680 |
| 7B 模型流畅 + 办公 + 游戏 | 16GB | PB1202 | Radeon 660M 核显,0.66L 超小 | ¥2,600 |
| 7B~13B NPU 加速 + 桌面美学 | 16GB | PB1301 | 50 TOPS NPU,金属机身 | 详询 |
| CUDA AI 开发 + 3A 游戏 | 16GB(可升级) | PB1401 | RTX 3060 独显,CUDA 生态 | 详询 |
| 70B 大模型 + 旗舰性能 | 128GB | PB1501 | 128GB 内存,可跑 70B | 详询 |
| 边缘批量部署(单路推理) | 6GB | PB0601 | 6 TOPS NPU,10W 功耗 | ¥1,750 |
| 边缘多路并发(复杂模型) | 6GB | PB0801 | 三核 NPU,旗舰边缘计算 | ¥1,950 |
PB1001 的双 SO-DIMM 插槽允许后期升级内存(最高 64GB),适合预算有限但想留余地的用户。
50 TOPS + 8GB 内存,跑 13B 模型加载失败。算力再强,内存不够就是白搭。选型时内存优先级应高于 TOPS。
峰值算力是理论值,实际运行 10 分钟后可能因散热不足降频。选型时关注设备散热设计和满载温度测试。
ARM 架构边缘盒子(PB0601/PB0801)预装 Linux,不装 Windows,没有 Office。买回来当办公电脑用不了。桌面场景选 x86,边缘部署选 ARM。 两者工具链完全不同,通用性有限。
A:内存是门槛,算力是天花板。 内存不够,模型根本加载不了;内存够用后,算力越强推理越快。优先确保内存满足目标模型需求,再考虑算力。
A:速度几乎没有差异。 一旦模型加载到内存,推理速度由 NPU/GPU 算力决定,内存只影响“能不能加载”和“同时能开多少程序”。16GB 和 32GB 跑同一个 7B 模型,速度几乎一样。
A:不一定。 要同时看:
内存带宽是否足够(建议 LPDDR5 以上)
散热设计能否支撑持续推理(长时间推理不降频)
推理框架是否适配 NPU(软件优化差异可能达数倍)
实测速度(token/s)比纸面 TOPS 更可靠。
A:先看内存容量,再看算力和散热。 排序是:内存容量 > 内存带宽 > NPU 算力 > 散热设计。